Kartu hero editorial yang dihasilkan berjudul "Ling-3.1-flash vs Qwen3.8-Flash" dengan subjudul "Dua jawaban untuk pertanyaan yang sama: bagaimana Anda membangun tier cepat?" Panel kiri berjudul "Perbesar dan umumkan" membawa keterangan "~560B total · ~25B aktif · 1M konteks" dan tag bertuliskan "bobot: segera hadir". Panel kanan berjudul "Perkecil dan luncurkan" membawa "125B total · 6B aktif · pratinjau Qwen4" dan tag bertuliskan "bobot: di Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Dua Cara Membangun Tier Cepat, dan Hanya Satu yang Dirilis

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua lab Tiongkok mengamati masalah yang sama pada musim gugur ini — bagaimana Anda membangun model murah dan cepat yang cukup baik untuk berada di dalam loop agen — dan sampai pada jawaban yang berlawanan. Ling-3.1-flash, yang diumumkan oleh Ant Group pada 30 September 2026, adalah model mixture-of-experts dengan sekitar 560 miliar parameter yang mengaktifkan sekitar 25 miliar parameter per token, dengan jendela konteks yang disebutkan hingga 1 juta token dan niat yang dinyatakan untuk merilis sumber terbuka "segera." Qwen3.8-Flash, yang dirilis oleh tim Qwen dari Alibaba pada 26 Agustus 2026, adalah model mixture-of-experts multimodal dengan 125 miliar parameter yang mengaktifkan sekitar 6 miliar parameter per token, dengan bobot yang sudah ada di Hugging Face dengan nama Qwen3.8-Flash-Next, model produksi yang aktif di API QwenCloud dengan tarif $0,15 per juta token masukan dan $0,47 per juta token keluaran, serta dukungan sejak hari pertama di SGLang. Satu lab memperbesar skala dan mengumumkan. Lab lainnya memperkecil skala dan merilis. Perbedaan itu lebih memberi pelajaran daripada benchmark apa pun yang diterbitkan oleh kedua lab tersebut.

Ini juga alasan mengapa perbandingan ini harus dibaca dengan cermat. Ling-3.1-flash tidak memiliki bobot, tidak memiliki lisensi, tidak memiliki kartu model, tidak memiliki harga API, dan tidak memiliki evaluasi independen; seluruh catatan yang dipublikasikan hanyalah sebuah postingan pengumuman, bagan tolok ukur dari vendor, dan satu slot di produk Ling Studio milik Ant sendiri. Qwen3.8-Flash memiliki semua hal itu dan keunggulan empat minggu karena telah dijalankan oleh orang-orang yang tidak bekerja untuk Alibaba. Membandingkan pilihan arsitektur itu adil. Membandingkan kemampuan belum bisa dibilang adil.

Dua keputusan desain, dan mengapa keduanya berbeda

Taruhan Qwen adalah bahwa tier cepat seharusnya secara struktural berbeda dari model unggulan, bukan sekadar lebih kecil darinya. Qwen3.8-Flash mengaktifkan 6 miliar dari 125 miliar parameternya — sekitar 95% sparsitas — dan memperoleh kemampuannya dari ke mana komputasi dirutekan, bukan dari keluasan mentah. Alibaba telah menyatakan secara eksplisit bahwa arsitektur di baliknya, yang memasangkan Gated DeltaNet dengan Qwen Sparse Attention dan tabel embedding N-gram, adalah pratinjau awal generasi Qwen4, yang sengaja diterbitkan lebih awal agar mesin inferensi, perkakas kuantisasi, dan pola penerapan dapat matang di sekitarnya sebelum model-model mahal dibangun di atasnya. Hasilnya adalah model yang murah per token secara desain: sekitar 6 miliar parameter pekerjaan pada setiap token, dengan harga yang ditetapkan Alibaba sebesar $0,15 untuk input dan $0,47 untuk output per juta token.

Taruhan Ant, sejauh yang diungkapkan pengumuman tersebut, lebih dekat ke penskalaan konvensional dengan konteks yang sangat panjang. Ling-3.1-flash mempertahankan fraksi aktif yang besar — sekitar 25 miliar parameter per token dari 560 miliar, jadi sekitar satu dari dua puluh dua — dan menyebutkan jendela hingga 1 juta token, empat kali lipat dari yang dilayani generasi Ling sebelumnya. Aplikasi Ling Studio mendeskripsikannya sebagai dibangun untuk "agen serbaguna, pencarian, pekerjaan kantor rutin, dan pengembangan perangkat lunak/kode," yang merupakan posisi tingkat cepat, tetapi ekonomi parameternya adalah milik model yang jauh lebih berat. Pada input yang identik, token yang melewati 25B parameter aktif membutuhkan komputasi sekitar empat kali lipat dari yang melewati 6B, sebelum keputusan penetapan harga masuk ke dalam gambaran.

Tidak ada pendekatan yang salah, dan keduanya adalah jawaban yang dapat dipertahankan atas "apa yang membatasi model murah." Qwen bertaruh bahwa sparsitas dan tumpukan atensi baru adalah batas atasnya. Ant bertaruh bahwa batas atasnya adalah konteks dan pengetahuan dunia, dan bahwa ia mampu menanggung komputasinya. Yang membedakan keduanya bagi pembaca bukanlah filosofi desainnya, melainkan penyampaiannya: desain yang dapat Anda unduh dan ukur versus desain yang hanya dapat Anda baca.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Berapa biaya yang harus Anda keluarkan untuk masing-masing, dan apa artinya dalam praktik

Selisih harganya tidak tipis dan tidak dekat. Qwen3.8-Flash dipublikasikan pada $0.15 per juta token masukan, $0.47 per juta keluaran, dan $0.018 per juta untuk pembacaan cache — angka yang sama pada pengumuman Alibaba, pada kartu model produksi vendor, dan pada halaman model yang dirutekan yang kami sediakan, yang seperti itulah bentuk pass-through dengan markup 0% saat Anda memeriksanya terhadap tiga sumber. Ant tidak mempublikasikan tarif apa pun untuk Ling-3.1-flash — tidak ada harga API, tidak ada diskon cache, tidak ada yang sebanding. Satu-satunya angka yang dipublikasikan untuk lini Ling adalah milik generasi sebelumnya, yang tercantum pada $0.075 untuk masukan dan $0.22 untuk keluaran per juta, kira-kira setengah dari tarif masukan Qwen dan kurang dari setengah tarif keluarannya. Jika tier Ling baru diberi harga mendekati posisi harga yang lama, di atas kertas itu akan menetapkan harga lebih rendah daripada Qwen3.8-Flash; jika harganya berada di sekitar komputasi yang tersirat dari 25B parameter aktifnya, itu tidak akan terjadi. Itu tebakan dalam kedua skenario, karena angkanya tidak ada.

Konteks adalah area di mana klaim Ling benar-benar lebih besar. Ant menyebut hingga 1 juta token untuk Ling-3.1-flash; Qwen3.8-Flash hadir dengan konteks default 1M token di API produksi dan jendela native 262.144 token pada bobot terbuka, yang dapat diperluas. Ada dua catatan pada angka Ling dan keduanya belum terselesaikan. Pertama, "hingga 1M" adalah spesifikasi, bukan pengukuran — belum ada yang menerbitkan perilaku pengambilan konteks panjang untuk model yang tidak dapat dipanggil oleh siapa pun di luar Ant. Kedua, generasi Ling sebelumnya memiliki celah yang persis sama antara jendela yang diiklankan dan cerita arsitektural di baliknya, dan jawabannya baru muncul ketika bobot, format, dan batas konteks akhirnya diterbitkan. Angka 1M yang menjadi tajuk utama hanyalah janji. Angka 1M pada Qwen3.8-Flash adalah default yang benar-benar dilayani, yang bisa Anda jadikan pembanding untuk klaim Ant.

Mengapa "preview" adalah kata yang jujur di satu sisi ini

Cara Alibaba sendiri membingkai Qwen3.8-Flash adalah bahwa ini merupakan pratinjau arsitektur yang dirilis dengan nama produksi — bobot terbukanya membawa sufiks "Next" justru agar tidak ada yang mengacaukan prototipe dengan model penyajian yang telah disetel. Pembingkaian itu telah divalidasi oleh peristiwa, bukan oleh pemasaran: SGLang merilis dukungan day-0 untuk Qwen3.8-Flash-Next pada hari perilisan, dengan model tersebut juga dikonfigurasi untuk Transformers, vLLM dan TokenSpeed, dan bobotnya sejak itu telah diadopsi di berbagai komunitas kuantisasi. Versi-versi dengan cepat menjadi biasa, yang memang seperti itulah wujud model yang telah dirilis.

Pengumuman Ant memiliki bentuk yang sama satu langkah lebih awal: spesifikasi yang dirilis lebih dulu sebelum peluncuran, dengan pernyataan eksplisit bahwa model akan segera di-open-source-kan. Ini adalah cara yang sah untuk meluncurkan — Ling-3.0-flash mengikuti persis jalur itu pada Juli, dan bobotnya dirilis di bawah MIT pada 7 Agustus, sekitar dua minggu kemudian. Namun, keadaan kedua proyek saat ini tidak dapat dibandingkan, dan sebanyak apa pun pembacaan grafik tidak akan menutup kesenjangan itu. Perlu disebutkan secara spesifik apa yang dapat dibawa oleh pihak luar ke masing-masing proyek.

Apa yang dapat diverifikasi secara independen untuk Ling-3.1-flash saat ini: bahwa pengumumannya ada dan bertanggal 30 September; bahwa angka parameter, parameter aktif, dan konteksnya berasal dari Ant sendiri; bahwa model tersebut muncul dalam produk Ling Studio milik Ant; dan bahwa belum ada bobot, lisensi, atau kartu model yang dipublikasikan. Apa yang dapat diverifikasi secara independen untuk Qwen3.8-Flash: bahwa bobotnya dapat diunduh dalam BF16 dan FP8; bahwa ketentuan lisensinya dapat dibaca; bahwa harga API-nya dipublikasikan; dan bahwa klaim tolok ukur Alibaba telah terbuka untuk direproduksi sejak akhir Agustus. Daftar kedua lebih panjang, dan itulah keseluruhan perbandingannya secara ringkas.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Bagaimana keduanya sebenarnya akan dievaluasi

Ant menerbitkan kartu benchmark dengan Ling-3.1-flash yang menempatkannya berhadapan dengan GPT-5.6 Sol, Claude Opus 5, Kimi K3, dua varian GLM, dan DeepSeek-V4.1-Flash, dengan angka utama 1.673 Elo pada GDPVal-AA v2.1, 75,16 pada FrontierSWE, dan 65,35 pada HealthBench Professional. Ada dua masalah pada kartu itu sebelum siapa pun memperdebatkan angkanya. Yang pertama adalah set pembandingnya: kedua model frontier yang dipilih Ant tertinggal satu generasi, karena Claude Opus 5.5 dan GPT-6 Sol mulai aktif pada 22 September 2026 dan sudah dapat dirutekan sekarang, yang berarti kartu itu menguji model Oktober terhadap frontier Juli, bukan frontier saat ini. Yang kedua adalah catatan kaki pada kartu itu sendiri, yang menyatakan bahwa hasil HealthBench Professional berasal dari "lingkungan AQ" dan bahwa kemampuan layanan kesehatan model tersebut saat ini hanya dapat dicoba di AQ — sebuah lingkungan yang tidak didefinisikan oleh dokumentasi publik mana pun. Skor utama yang lingkungan evaluasinya tidak disebutkan tidak dapat direproduksi bahkan secara prinsip.

Klaim pembanding Qwen3.8-Flash, sebaliknya, dibuat ketika bobotnya sudah dirilis, dan Alibaba mempertaruhkan posisinya pada klaim yang dapat diuji siapa saja: bahwa rasio sparsitas, bukan jumlah parameter, adalah sumber kemampuannya. Empat minggu penggunaan bukanlah vonis, tetapi cukup lama sehingga klaim-klaim itu tidak lagi tanpa tantangan — yang merupakan kondisi berguna bagi sebuah model.

Apa yang sebenarnya harus dilakukan dengan ini, hari ini

Bagi para pengembang, pembagian praktisnya sederhana. Ling-3.1-flash bukan komponen yang dapat Anda adopsi minggu ini: tidak ada endpoint untuk dipanggil, tidak ada bobot untuk dihosting, tidak ada lisensi untuk diperiksa, dan tidak ada harga untuk dianggarkan. Apa pun bentuk akhir modelnya nanti, langkah yang berguna saat ini adalah menetapkan pemicu — bobot dipublikasikan, lisensi permisif, skor independen pada FrontierSWE yang mendekati 75.16 — lalu meninjau kembali. Sejarah generasi sebelumnya sendiri menunjukkan bahwa bobot dapat muncul dua minggu setelah pengumuman, jadi pemicu itu mungkin cepat terpicu.

Qwen3.8-Flash sudah menjadi komponen. Model ini aktif di katalog kami sebagai model routed dengan harga daftar penyedia tanpa markup — kartu routed mencantumkan $0,15 masuk, $0,47 keluar, dan $0,018 per juta pembacaan cache, angka yang sama dengan yang dipublikasikan Alibaba, yang merupakan makna kebijakan markup 0% dalam praktik, bukan di atas slide. Di balik satu kunci ia berada di samping Claude Opus 5, GPT-5.6 Sol, dan DeepSeek-V4.1-Flash, sehingga perbandingan yang Ant undang — kandidat melawan frontier saat ini — dapat dijalankan dengan mengarahkan konfigurasi ke dua rute alih-alih memelihara dua integrasi, dengan failover otomatis yang menangani akhir pekan ketika penyedia goyah. Itulah perbedaan antara diskusi arsitektur dan eksperimen.

Putusan, sejauh yang bisa diberikan: Qwen membuat taruhan arsitektural yang lebih berani dan memiliki kepercayaan diri untuk menerbitkannya lebih awal serta membiarkan orang membedahnya. Ant membuat taruhan yang lebih berat — lebih banyak parameter, komputasi aktif per token lebih besar, konteks lebih panjang — dan sejauh ini menerbitkan bagan, bukan model. Bagan itu terlihat bagus. Bagan itu juga satu-satunya yang dimiliki siapa pun.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari