
Ling-3.1-flash Sudah Live dan Gratis Selama Dua Minggu: Apa yang Sebenarnya Disajikan oleh 560B MoE
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Ling-3.1-flash, model mixture-of-experts dengan sekitar 560 miliar parameter yang diumumkan lab inclusionAI milik Ant Group pada 29 hingga 30 September 2026, berhenti menjadi sekadar siaran pers minggu ini: model itu kini menjawab permintaan di API komersial yang aktif. Model ini sedang menjalani uji coba gratis dua minggu di gateway inferensi pihak ketiga, dan juga muncul dalam produk Ling Studio milik Ant sendiri — yang menggeser pertanyaan dari "apakah ia ada" menjadi "apa yang sebenarnya dilayaninya". Jawabannya lebih sempit daripada yang disiratkan angka-angka utama. Ling-3.1-flash bersifat masukan teks, keluaran teks; ia melayani konteks 262.144 token (256K) meskipun pengumuman tersebut menyebut 1M sebagai target akhirnya; keluarannya dibatasi pada 32.768 token; dan belum ada yang mempublikasikan harga yang akan Anda bayar pada hari kelima belas, saat masa gratis berakhir dan bobot-bobotnya diharapkan menyusul.
Kesenjangan antara kartu pengumuman dan endpoint yang sudah live itulah hal yang berguna untuk dipegang, karena sebagian besar liputan tentang rilis ini membaca spesifikasinya seolah-olah model tersebut sudah merilisnya hari ini. Padahal tidak. Ling-3.1-flash adalah model kedua dari lab ini dalam tiga bulan yang hadir sebagai apa yang secara blak-blakan dimasukkan oleh pelacak independen LLM Releases ke dalam kategori “weights not released”, dan perbedaan antara apa yang Ant katakan tentang model ini dan apa yang bisa dipanggil developer saat ini adalah titik di mana anggaran atau proyek percontohan bisa diam-diam melenceng.
Apa yang berubah antara pengumuman dan hari ini
Pengumumannya sendiri adalah postingan spesifikasi: ~560B parameter total, ~25B aktif per token, hingga 1M token konteks, tiga angka evaluasi utama, dan sebuah janji — "kami berencana untuk segera merilis model ini secara open-source." Tidak ada dari semua itu yang berubah. Yang berubah adalah ketersediaan. Dalam waktu sehari setelah pengumuman, model itu dapat diakses di edge komersial, dan uji coba gratis mengekspos endpoint nyata yang sama seperti yang akan disediakan versi berbayar: permukaan API yang sama, modalitas hanya-teks yang sama, sakelar mode berpikir yang sama untuk kerja agen berhorizon panjang.
Bagi siapa pun yang sedang memutuskan apakah akan menghabiskan waktu engineering untuk ini, uji coba adalah inti cerita minggu ini, dan itu bisa berdampak dua arah. Inferensi gratis selama dua minggu adalah cara yang benar-benar murah untuk melihat bagaimana model berperilaku pada prompt Anda sendiri — hal yang langka untuk model seukuran ini. Tetapi gratis adalah status promosi, bukan harga. Belum ada daftar tarif pasca-uji coba yang diterbitkan untuk Ling-3.1-flash di mana pun, jadi model biaya apa pun yang Anda bangun berdasarkan tier gratis hanyalah placeholder sampai Ant dan para host-nya menetapkan angkanya.
Lembar spesifikasi, dan tiga angka yang masih sebatas janji
• Parameter — total 560B, ~25B aktif per token. Dinyatakan oleh vendor, dan sekitar empat kali lipat dari generasi sebelumnya dengan total 124B / 5,1B aktif. Rasio sparsitasnya tetap sekitar 1 banding 22, jadi aktivasinya tidak jauh lebih ramping — model ini hanya jauh lebih besar daripada model yang digantikannya.
• Konteks — dilayani pada 262.144 token hari ini. "Hingga 1M" adalah target setelah jendela diaktifkan; itu bukan yang diberikan endpoint uji coba kepada Anda, dan itulah salah tafsir paling umum dari rilis ini.
• Keluaran — maksimum 32.768 token. Wajar untuk loop agen, ketat jika Anda berniat menghasilkan dokumen panjang dalam satu kali proses.
• Modalitas — masukan teks, keluaran teks. Ini adalah model teks. Visi, audio, dan masukan berkas tidak termasuk dalam peluncuran, dan belum ada tanggal yang diberikan untuk fitur-fitur tersebut.
• Penalaran — stack hibrida dengan sakelar mode berpikir eksplisit, pola yang sama yang digunakan generasi sebelumnya, ditujukan untuk pekerjaan agen multi-langkah dan pemanggilan alat, bukan obrolan satu putaran.
• Bobot dan lisensi — belum dipublikasikan. Inilah angka yang paling penting dan yang belum memiliki nilai sama sekali: tidak ada repositori Hugging Face, tidak ada teks lisensi, dan tidak ada checkpoint yang dapat diunduh hingga saat ini.

Kartu benchmark, dibaca dengan diskon yang dibutuhkannya.
Pelaporan Ant sendiri menempatkan Ling-3.1-flash pada agregat 81,0 di lima benchmark agen, dengan 40,4% pada Terminal-Bench 4.0, 55,9% pada SWE-Atlas, dan 65,35% pada HealthBench Professional; perusahaan sendiri juga mengklaim tambahan 1.673 Elo pada GDPVal-AA v2.1 dan 75,16 pada FrontierSWE. Semua angka itu berasal dari pihak pertama. Tidak ada harness, tidak ada kumpulan prompt, dan tidak ada bobot yang dapat digunakan orang lain untuk menjalankan ulang rangkaian uji tersebut, yang merupakan catatan standar bagi model pada tahap ini — dan di sini perlu dikatakan secara terang-terangan: skor vendor yang tidak direproduksi adalah klaim tentang sebuah model, bukan pengukurannya.
Kartu ini juga memberi informasi yang mungkin tidak dimaksudkan oleh para penulisnya. Hasil Terminal-Bench 4.0 sebesar 40,4% berada jauh di belakang tier terdepan; Claude Sonnet 5.5, model kelas menengah alih-alih flagship, mencetak 70,6% pada versi benchmark yang sama. Pembacaan yang jujur bukanlah bahwa Ling-3.1-flash lemah — 40,4% adalah angka agentic-terminal yang terhormat untuk model yang diposisikan pada biaya — melainkan bahwa kerangka "mendekati frontier pada benchmark utama" yang beredar di media sosial pada hari pengumuman tidak bertahan saat bersentuhan dengan baris-baris spesifik. Benchmark di mana model tampak paling kuat, HealthBench Professional pada 65,35, juga merupakan benchmark yang membawa catatan kaki canggung: Ant menyatakan bahwa model ini dievaluasi dalam lingkungan yang disebutnya AQ dan bahwa kemampuan layanan kesehatan model "saat ini hanya dapat dialami di AQ," tanpa mendefinisikan apa itu AQ di mana pun secara publik. Skor utama dengan lingkungan tanpa nama yang dilampirkan adalah demo, bukan hasil yang dapat direproduksi.
Mengapa model besar yang hadir sebagai uji coba adalah berita sebenarnya
Langkah yang lebih menarik di sini adalah urutannya, bukan parameternya. Ling-3.0-flash langsung menuju bobot terbuka. Yang ini hadir dengan uji coba lebih dulu, dengan bobot, lisensi, dan harga resmi semuanya masih ditahan serta komitmen publik untuk open-source hanya setelah periode gratis berakhir. Itu adalah playbook rilis komersial yang mengenakan pengumuman model terbuka, dan ini adalah perubahan nyata yang layak dicermati: jika bobotnya hadir di bawah lisensi permisif, komunitas mendapatkan model dasar 560B untuk di-fine-tune dan didistilasi; jika hadir dengan syarat komersial, uji coba dua minggu itulah produknya dan frasa "open source" hanyalah pemasaran. Apa pun itu, pilihannya jatuh di dalam jendela uji coba, dan itulah yang harus diperhatikan alih-alih baris benchmark mana pun.
Di mana ini berjalan, dan gambaran routing yang jujur
Untuk sekarang, Ling-3.1-flash dapat dijangkau melalui antarmuka produk milik vendor sendiri dan melalui platform inferensi pihak ketiga yang menjalankan uji coba — dan hanya sebatas itu. Model ini belum ada di katalog OrcaRouter saat ini; pencarian pada API model publik kami untuk Ling-3.1-flash, Ling-3.0-flash, dan varian vision Ling-3.0 semuanya mengembalikan hasil tidak ditemukan, dan kami tidak akan berpura-pura sebaliknya. Ketika endpoint Ant kelak benar-benar mencapai ketersediaan umum dengan harga daftar yang dipublikasikan, model pass-through yang diterapkan OrcaRouter — harga daftar penyedia diteruskan tanpa markup, sehingga pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama — justru merupakan pengaturan yang tepat untuk model yang penetapan harganya masih belum ditulis.
Yang dapat Anda lakukan, tanpa menunggu lisensi, adalah menjalankan perbandingan yang benar-benar penting bagi model yang belum terbukti: bandingkan model itu dengan model tingkat Flash yang dapat Anda panggil sekarang. Gemini 3.8 Flashdi balik satu kunci APIdengan failover otomatis di antara keduanya.Untuk model dalam uji coba gratis yang bobot dan kartu tarifnya sama-sama tidak diketahui, itulah cara yang masuk akal untuk mempertahankannya — satu kandidat lagi yang dapat Anda rutekan selama uji coba berlangsung, dan jalur produksi yang tidak bergantung pada apa yang terjadi pada hari kelima belas.

Apa yang harus dilakukan minggu ini
Jika model tersebut relevan dengan pekerjaan Anda, uji coba adalah alasan untuk bertindak sekarang alih-alih menunggu pertanyaan open-weight terjawab — dua minggu inferensi gratis pada MoE 560B adalah evaluasi termurah yang akan Anda dapatkan, dan jawaban atas "apakah model ini tetap andal pada prompt saya" sudah tersedia hari ini meskipun jawaban atas "bisakah saya meng-host-nya sendiri" belum. Tiga hal yang perlu diperiksa selama jendela terbuka, secara berurutan:
• Jalankan beban kerja Anda sendiri, bukan kartu tolok ukurnya. Angka-angka yang dipublikasikan adalah pilihan tugas dari Ant; prompt Andalah yang menentukan stack Anda.
• Uji konteks yang benar-benar akan Anda gunakan. Endpoint ini menyajikan 262.144 token, bukan 1M. Jika desain Anda bergantung pada jendela yang lebih besar, Anda merancang dengan mengandalkan sebuah janji.
• Jangan membangun model biaya berdasarkan "gratis." Gratis adalah kondisi dua minggu. Sampai daftar tarif diterbitkan, rencanakan peralihan kembali ke model Flash-tier berbayar sebagai default dan anggap Ling-3.1-flash sebagai kapasitas tambahan.
Pengumumannya nyata dan modelnya sedang berjalan, yang lebih dari yang bisa dikatakan seminggu yang lalu. Namun dirilis-dan-terbuka dan berjalan-dalam-uji-coba adalah keadaan yang berbeda, dan yang ini jelas berada pada keadaan kedua — spesifikasi 560B, endpoint 256K, kartu tolok ukur khusus vendor, dan tenggat dua minggu yang merupakan satu-satunya tenggat pasti dalam seluruh peluncuran ini.

